一句话解释:假设检验是一套用样本数据来判断“关于总体的某个说法是否成立”的统计方法——你先立一个假设,再看手头的数据是否离谱到足以推翻它。
对独立站和跨境电商来说,它就是“用数据说话”的底层逻辑:新落地页真的比旧版好吗?广告 A 组的转化率真的高于 B 组吗?还是只是随机波动?
生活化类比:法庭审判
假设检验的逻辑和法庭判案几乎一模一样:
- 原假设 H₀(无罪推定):默认被告无罪。在业务里就是“新版和旧版没有区别”“广告 A 和 B 转化率一样”。
- 备择假设 H₁:检方主张“被告有罪”,即“新版确实更好”。
- 证据(样本数据):你收集到的转化率、客单价、点击率。
- 判决标准(显著性水平 α):通常设为 0.05,相当于“要定罪,证据必须足够强,强到只有 5% 的概率是巧合”。
- p 值:在“被告无罪”的前提下,出现当前证据(或更极端证据)的概率。p 值越小,证据越不利于 H₀。
关键点:你永远不能“证明”H₀ 为真,只能说“证据不足以推翻它”。就像无罪释放不等于真的清白。
核心概念与公式
| 概念 | 含义 | 业务中的叫法 |
|---|---|---|
| 原假设 H₀ | 默认成立的“无差异”假设 | “新版没效果” |
| 备择假设 H₁ | 想证明的“有差异”假设 | “新版更好” |
| 显著性水平 α | 允许犯“弃真错误”的概率 | 通常 0.05 |
| p 值 | 数据与原假设的“矛盾程度” | 越小越显著 |
| 统计功效 1-β | 真有效时能检测出来的概率 | 通常要求 ≥ 0.8 |
| 样本量 n | 参与实验的用户数 | 决定灵敏度 |
核心判断规则:若 p 值 < α,拒绝 H₀,认为差异显著;否则不拒绝 H₀。
以两比例 z 检验(A/B 测试最常用)为例:
$$z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}}$$
其中 $\hat{p}_1、\hat{p}_2$ 是两组样本转化率,$\hat{p}$ 是合并转化率,$n_1、n_2$ 是两组样本量。
与相关术语对比
| 术语 | 核心问题 | 与假设检验的关系 |
|---|---|---|
| 置信区间 | 参数可能落在哪个范围? | 与假设检验互为镜像:95% 置信区间不含 0,等价于 α=0.05 下显著 |
| p 值 | 数据有多“极端”? | 假设检验的判决依据,但不是“结论正确的概率” |
| A/B 测试 | 哪个版本更好? | 假设检验最常见的业务应用形式 |
| 统计功效 | 真差异能否被检出? | 决定样本量和实验可靠性 |
| 第一类错误 α | 误判有效(假阳性) | 把没效果的当成有效,浪费预算 |
| 第二类错误 β | 漏判有效(假阴性) | 把有效果的当成无效,错失增长 |
应用场景(含数据案例)
案例 1:落地页改版 A/B 测试
某独立站旧版落地页转化率 3.2%(n=5,000),新版 3.8%(n=5,000)。合并转化率 3.5%,代入公式得 z ≈ 1.63,对应 p ≈ 0.10 > 0.05。结论:差异不显著,不能贸然全量上线——需要更大样本或更长周期。
案例 2:广告素材效果对比
Facebook 广告 A 组 CTR 1.5%(曝光 20,000),B 组 CTR 1.9%(曝光 20,000)。z ≈ 3.1,p ≈ 0.002 < 0.01。结论:B 组显著更优,可放心把预算倾斜到 B 组。
案例 3:邮件营销主题行测试
主题行 X 打开率 22%(发送 8,000 封),主题行 Y 打开率 24.5%(发送 8,000 封)。p ≈ 0.0002,差异高度显著。结论:Y 主题行值得作为模板沉淀。
案例 4:定价策略验证
新价格使客单价从 $45 升到 $48,但转化率从 2.5% 降到 2.3%。需要同时检验两个指标,并计算每访客收入(RPV)是否显著提升,避免“单指标显著、整体利润下降”的陷阱。
常见误区
1. p < 0.05 就等于“效果很大”:p 值只说明“不太可能是巧合”,不说明效应大小。样本量足够大时,0.1% 的微小差异也可能显著。
2. p > 0.05 就等于“没效果”:可能只是样本量不足、功效太低。应报告置信区间,而非简单二元结论。
3. 偷看数据、提前停止实验:多次检验会大幅抬高假阳性率。应预先确定样本量和实验周期。
4. 多重比较不校正:同时测 20 个指标,按 α=0.05 期望就有 1 个“假显著”。需用 Bonferroni 等方法校正。
5. 把统计显著当成业务显著:转化率提升 0.05% 可能统计显著,但不足以覆盖开发成本。
6. 忽略辛普森悖论:整体显著,分渠道后可能反转,需分层分析。
相关术语
- 置信区间(Confidence Interval)
- p 值(p-value)
- A/B 测试(A/B Testing)
- 统计功效(Statistical Power)
- 第一类错误 / 第二类错误
- t 检验 / z 检验 / 卡方检验
- 样本量计算(Sample Size Calculation)
- 多重比较校正(Bonferroni Correction)
- 辛普森悖论(Simpson's Paradox)